Aggregate benchmark scores obscure patient safety implications of errors across frontier language models
Cette étude démontre que les scores agrégés des modèles de langage avancés masquent des variations critiques de sécurité clinique, notamment en matière de triage et de gestion des crises, rendant ces métriques insuffisantes pour évaluer ou prédire la sûreté de leur déploiement en santé.